发布 Claude Opus 4.8
发布日期: 2026年5月28日
分类: Product Announcements
来源: https://www.anthropic.com/news/claude-opus-4-8
Anthropic 将 Claude Opus 升级至新版本:Claude Opus 4.8。它在 Opus 4.7 基础上提升了各项 benchmark 表现,也是一位更有效的协作者;今日起以相同价格提供。
Opus 4.8 同时带来多项新功能。claude.ai 用户现可控制 Claude 在任务中投入的 effort;Claude Code 增加“dynamic workflows”,可处理超大规模问题;Opus 4.8 的 fast mode 支持模型以 2.5 倍速度工作,价格则比早期模型的 fast mode 低三分之二。
Opus 4.8 的能力
下表展示 Opus 4.8 在编码、Agentic 能力、推理及实用知识工作测试中,相对于前代及其他模型的表现。更详细、覆盖范围更广的能力评估见 Claude Opus 4.8 System Card。
与 Opus 4.8 协作
早期测试者发现,Claude Opus 4.8 在执行 Agentic 任务时更可靠,判断也更敏锐。以下是部分测试者对协作体验的评价:
Claude Opus 4.8 的判断力明显更好。在 Claude Code 中,它会问对问题、发现自身错误、在计划不可靠时提出异议,并在做出大改动前,为复杂的多服务探索建立充分信心。它是很适合一起构建产品的模型。
在我们的 Super-Agent benchmark 中,Claude Opus 4.8 是唯一端到端完成所有 case 的模型,在成本相当条件下超过此前 Opus 模型和 GPT-5.5。用于翻译、深度研究、制作幻灯片和分析的 Agent 产品中,它提供了很强的可靠性。
在 CursorBench 上,Claude Opus 4.8 在所有 effort level 都超过此前 Opus 模型。其 tool calling 效率显著提高,以更少步骤达到相同智能水平,并能将端到端任务执行完成。
Claude Opus 4.8 在我们的 Legal Agent Benchmark 上取得最高记录分数,也是首个 overall all-pass 标准超过 10% 的模型。对于实质性法律工作,这种准确率提升会直接决定客户能够放心交办多少真实律师工作。
相比 Opus 4.7,Claude Opus 4.8 像一次显著的日常体验升级:更快、更容易协作,也更能在长 session 中保持 context 和 style direction。我持续信任它处理那些必须同时兼顾文风、品味和技术执行的工作。
Claude Opus 4.8 是我们测试过最强的 computer-use 与 browser-agent 模型,在 Online-Mind2Web 获得 84%,显著超过 Opus 4.7 和 GPT-5.5。它能保持反思和专注,满足客户 Agent 工作负载端到端可靠的需求。
Claude Opus 4.8 的工具使用更干净,对指令的遵循也达到我们无人值守工程工作负载持续运行所需的一致性。它优于 Opus 4.6,并修复了我们在 Opus 4.7 中见到的评论过多和 tool-calling 问题。Anthropic 的这次发布,直接转化为使用 Devin 的工程师更快的能力提升。
在我们的长时运行 eval 中,Claude Opus 4.8 的分析质量持续高于此前 Opus 模型,完成更快、输出更丰富且信息密度更高,整体信噪比明显更好。最大的差异是它会主动标出分析输入和输出的问题,而其他模型常常遗漏、留给用户自行发现。
在 CoCounsel Legal 的测试中,Claude Opus 4.8 相较此前 Opus 模型,在一致性和推理质量上有实质提升。对客户依赖的高风险专业工作流而言,这种可靠性很重要。随着我们为法律和税务专业人士构建 fiduciary-grade AI system,这些进展有助于提高真实工作流中可信 AI 表现的标准。
Claude Opus 4.8 为企业 AI 设定新标准。在 Databricks 的数据与知识工作 AI Agent Genie 中,新 Opus 模型让 Agentic 推理实现跃迁,比此前任何 Opus 更快地处理更深、更长步骤的问题。其 multimodal 能力还让 Genie 能直接推理 PDF、图表及其他非结构化内容,Token 成本比 Opus 4.7 低 61%。
在 Hebbia 的 orchestrator 所处理的金融文档工作流中,Claude Opus 4.8 保持 Opus 4.7 的强质量,同时在 citation precision 和 retrieval token efficiency 上显著提升,非常适合客户每天处理的密集 filing。
Opus 4.8 最突出的改进之一是其 honesty(诚实性)。Anthropic 训练所有模型保持诚实,例如不作无法支持的主张;但 AI 模型常见问题是,在证据薄弱时便仓促下结论,自信宣称工作已有进展。早期测试者表示,Opus 4.8 更可能标出工作中的不确定性,也更少作出缺乏依据的主张。评估结果也支持这一点:相较前代,Opus 4.8 允许自己写出的代码缺陷未被指出就通过的概率约低四倍。
与往常一样,Anthropic 在发布前对模型完成详细 alignment assessment。就积极特质而言,Alignment 团队结论是 Opus 4.8“在支持用户自主性、以用户最佳利益行动等亲社会特质指标上达到新高”。评估也显示,它出现 misaligned behavior,例如欺骗或配合滥用的比例明显低于 Opus 4.7,并与对齐表现最好的模型 Claude Mythos Preview 相近。完整 alignment assessment 和部署前安全测试均收录于 Opus 4.8 System Card。
今日同步发布
除 Claude Opus 4.8 外,Anthropic 同时更新:
- Dynamic workflows。 这项 research preview 功能让 Claude 在 Claude Code 中承担更大任务。Claude 可规划工作,再在单一 session 中运行数百个并行 subagent;使用 Opus 4.8 时,这些 Agent 可运行得更久。它会在向用户回报前验证输出。例如,配合 Opus 4.8 的 Claude Code 可从启动到合并,执行跨越数十万行代码、以既有测试套件为准的大规模代码库迁移。Claude Code Enterprise、Team 和 Max 计划可用,详情见文章。
- claude.ai 与 Cowork 的 effort control。 模型选择器旁新增控制项,用户可选择 Claude 在回复中投入多少 effort。较高设置下,Claude 会更频繁、更深入地思考,以提供更好回答;较低设置下,响应更快,用户 rate limit 消耗更慢。所有计划均可使用。
- Messages API 现在接受
messages数组中的systementry。 开发者可在任务中途更新 Claude 指令,而不会破坏 prompt cache,也不必将更新伪装成 user turn。某个 harness 可利用该能力在 Agent 运行期间更新权限、Token budget 或环境 context。
关于 effort
Opus 4.8 默认使用 high effort,Anthropic 认为这是质量与用户体验之间最好的整体平衡。对编码任务,该 effort level 使用的 Token 数与 Opus 4.7 默认设置相近,但性能更好。用户可选择“extra”(Claude Code 中为 xhigh)或“max”,模型会消耗更多 Token 以取得更好结果;对于困难任务和长时异步工作流,建议使用“extra”。Claude Code 已提高 rate limit,以适应高 effort 带来的更多 Token 使用;用户可按项目需要选择。
下一步
用户会发现 Opus 4.8 相比前代是幅度不大但切实可感的提升。Anthropic 仍在继续开发并发布能以更低成本提供许多 Opus 能力的模型。
此外,Anthropic 计划发布一个智能水平高于 Opus 的新模型类别。作为 Project Glasswing的一部分,少数组织目前正使用 Claude Mythos Preview 处理网络安全工作。这个能力等级的模型需要更强网络安全保障才可普遍发布。Anthropic 正快速推进这些保障的开发,预计未来数周可向所有客户提供 Mythos-class 模型。
可用性
Claude Opus 4.8 今日起在所有地区可用。常规使用价格与 Opus 4.7 保持不变:每百万 input token 5 美元、每百万 output token 25 美元。fast mode 价格为每百万 input token 10 美元、每百万 output token 50 美元。开发者可通过 Claude API 使用 claude-opus-4-8。
脚注
- Terminal-Bench 2.1: Anthropic 使用 Terminus-2 public harness 报告所有模型成绩。使用 Codex CLI harness 报告的 GPT-5.5 分数为 83.4%。
- OSWorld-Verified: 为更准确反映模型在真实世界中的表现,Anthropic 调整了 OSWorld-Verified 的运行方法,并将 Opus 4.7 分数更新为 82.3%。详细更新见 System Card。
- Finance Agent v2: Gemini 3.5 Flash 在 Finance Agent v2 上得到 57.9%,相较 Gemini 3.1 Pro 有显著提升。
相关内容
Anthropic 以 9,650 亿美元投后估值完成 650 亿美元 H 轮融资
Anthropic 在米兰设立办公室,支持意大利企业、研究和开发者
Anthropic 将在米兰设立欧洲第六个办公室。